В области искусственного интеллекта моделирование последовательностей смещает фокус со статических снимков на временные потоки. Стандартные задачи машинного обучения часто предполагают, что точки данных являются независимыми и одинаково распределёнными (IID), то есть порядок выборок не влияет на результат.
Моделирование последовательностей явно отвергает это предположение, опираясь на три ключевых принципа:
- Нарушение инвариантности к перестановкам: В табличных данных порядок столбцов произволен. В последовательностях порядок является основной характеристикой. Замена «The cat ate the rat» на «The rat ate the cat» принципиально меняет семантическую эталонную истину несмотря на идентичные токены.
- Авторегрессионные свойства: Мы предполагаем, что наблюдение в момент времени $t$ математически обусловлено своей историей ($t-1, t-2, \dots, 1$). Это требует вероятностей переходов для отражения того, как развивается информация.
- Отображение переменной длины: В отличие от фиксированных сеток 28×28 пикселей, последовательности, такие как предложения или сейсмические волны, являются эластичными. Модели должны обрабатывать входные данные длины $N$ и выдавать выходные данные длины $M$ с использованием согласованных параметров.